Micron Document
<!DOCTYPE html>
<html class="client-nojs vector-feature-language-in-header-enabled vector-feature-language-in-main-page-header-disabled vector-feature-page-tools-pinned-disabled vector-feature-toc-pinned-clientpref-0 vector-toc-not-available vector-feature-main-menu-pinned-disabled vector-feature-limited-width-clientpref-1 vector-feature-limited-width-content-enabled vector-feature-custom-font-size-clientpref-1 vector-feature-appearance-pinned-clientpref-0 skin-theme-clientpref-day vector-sticky-header-enabled" lang="de" dir="ltr"><head>
<meta charset="UTF-8">
<title>Information Retrieval</title>
<meta name="viewport" content="width=device-width, initial-scale=1.0">
<link rel="icon" type="image/png" href="./_res_/favicon.png">
<link rel="canonical" href="https://de.wikipedia.org/wiki/Information_Retrieval"> <link href="./_mw_/ext.cite.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.math.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.wikimediamessages.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.icons.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.search.codex.styles.css" rel="stylesheet" type="text/css">
<link href="./_mw_/skins.vector.styles.css" rel="stylesheet" type="text/css">
<meta name="ResourceLoaderDynamicStyles" content="">
<link href="./_mw_/ext.gadget.citeRef.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.defaultPlainlinks.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonHide.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonLayout.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiCommonStyle.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiDarkmode.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.dewikiResponsive.css" rel="stylesheet" type="text/css">
<link href="./_mw_/ext.gadget.specialSearch.css" rel="stylesheet" type="text/css">
<link rel="stylesheet" type="text/css" href="./_mw_/site.styles.css">
<link rel="stylesheet" type="text/css" href="./_mw_/noscript.css">
<link rel="stylesheet" type="text/css" href="./_res_/footer.css">
<link rel="stylesheet" type="text/css" href="./_res_/vector-2022.css">
</head>
<body class="skin--responsive skin-vector skin-vector-search-vue mediawiki ltr sitedir-ltr mw-hide-empty-elt ns-0 ns-subject page-Information_Retrieval rootpage-Information_Retrieval skin-vector-2022 action-view">
<div class="mw-page-container">
<div class="mw-page-container-inner">
<div class="mw-content-container">
<main id="content" class="mw-body">
<header class="mw-body-header vector-page-titlebar">
<h1 id="firstHeading" class="firstHeading mw-first-heading"><span class="mw-page-title-main">Information Retrieval</span></h1>
</header>
<a id="top"></a>
<div id="bodyContent" class="vector-body ve-init-mw-desktopArticleTarget-targetContainer" aria-labelledby="firstHeading" data-mw-ve-target-container="">
<div id="contentSub">
<div id="mw-content-subtitle"></div>
</div>
<div id="mw-content-text" class="mw-body-content mw-content-ltr" lang="de" dir="ltr"><div class="mw-content-ltr mw-parser-output" lang="de" dir="ltr"><p><b>Information Retrieval</b> [<style data-mw-deduplicate="TemplateStyles:r227981795">
/* start https://de.wikipedia.org/ */


.mw-parser-output .IPA a{text-decoration:none}


/* end https://de.wikipedia.org/ */
</style><span class="navigation-not-searchable"><span class="IPA"><a href="Liste_der_IPA-Zeichen" title="Liste der IPA-Zeichen"><span title="Aussprache im Internationalen Phonetischen Alphabet (IPA)" lang="zxx">ˌɪnfɚˈmeɪʃən ɹɪˈtɹiːvəl</span></a></span></span>] (<b>IR</b>) betrifft das Wiederauffinden von <a href="Information" title="Information">Information</a>, meist durch Abruf aus Datenbanken. Das Fachgebiet beschäftigt sich mit computergestütztem Suchen nach komplexen Inhalten (also nicht z.&nbsp;B. nach Einzelwörtern) und fällt in die Bereiche <a href="Informationswissenschaft" title="Informationswissenschaft">Informationswissenschaft</a>, <a href="Informatik" title="Informatik">Informatik</a> und <a href="Computerlinguistik" title="Computerlinguistik">Computerlinguistik</a><sup id="cite_ref-:0_1-0" class="reference"><a href="#cite_note-:0-1"><span class="cite-bracket">[</span>1<span class="cite-bracket">]</span></a></sup>.
</p><p>Komplexe Texte oder Bilddaten, die in großen Datenbanken gespeichert werden, sind für Außenstehende zunächst nicht zugänglich oder abrufbar. Das Wort <i>retrieval</i> bedeutet auf Deutsch <i>Abruf</i> bzw. <i>Wiederauffinden</i>. Beim IR geht es also darum, <i>bestehende</i> Informationen wieder aufzufinden. Etwas anderes wäre das Entdecken <i>neuer</i> Strukturen: Das gehört zur <a href="Knowledge_Discovery_in_Databases" title="Knowledge Discovery in Databases">Knowledge Discovery in Databases</a> mit <a href="Data-Mining" title="Data-Mining">Data-Mining</a> und <a href="Text_Mining" title="Text Mining">Text Mining</a>.
</p><p>Eng verwandt ist <a href="Document_Retrieval" class="mw-redirect" title="Document Retrieval">Document Retrieval</a>, das hauptsächlich auf (Text-)Dokumente als zu ermittelnde Information abzielt.
</p>

<div class="mw-heading mw-heading2"><h2 id="Anwendungsbereich">Anwendungsbereich</h2></div>
<p>IR-Methoden werden beispielsweise in <a href="Internet-Suchmaschine" class="mw-redirect" title="Internet-Suchmaschine">Internet-Suchmaschinen</a> (wie <a href="Google_Suche" class="mw-redirect" title="Google Suche">Google</a>) verwendet. Man nutzt sie auch in digitalen <a href="Bibliothek" title="Bibliothek">Bibliotheken</a> (z.&nbsp;B. zur Literatursuche) sowie bei Bildsuchmaschinen. Auch Antwortsysteme oder <a href="Spamfilter" title="Spamfilter">Spamfilter</a> verwenden IR-Techniken.
</p><p>Es ist schwierig, sich komplexe Information zu erschließen:
</p>
<ul><li>Unsicherheit: In einer Datenbank mag es sein, dass keine Angaben über den Inhalt der enthaltenen Dokumente gespeichert (Texte, Bilder, Filme, Musik etc.) worden sind. Befragt man das System, erhält man mangelhafte, fehlerhafte oder gar keine Antworten. Bei Texten mangelt es z.&nbsp;B. an Beschreibungen von <a href="Homograph" title="Homograph">Homographen</a> (Wörter, die gleich geschrieben werden; z.&nbsp;B. Bank - Geldinstitut, Sitzgelegenheit) und <a href="Synonymie" class="mw-redirect" title="Synonymie">Synonymen</a> (Bank und Geldinstitut).</li>
<li>Vagheit: Der Benutzer kann die Art der Informationen, die er sucht, nicht in präzise und zielführende Suchbegriffe fassen (wie z.&nbsp;B. in <a href="SQL" title="SQL">SQL</a> in <a href="Relationale_Datenbank" title="Relationale Datenbank">relationalen Datenbanken</a>). Seine Suchanfrage enthält daher zu vage Bedingungen.</li></ul>

<p>Generell sind am IR zwei (sich unter Umständen überschneidende) Personenkreise beteiligt (vgl. Abbildung rechts).
</p><p>Der erste Personenkreis sind die Autoren der in einem IR-System gespeicherten Informationen, die sie entweder selbst einspeichern, oder aus anderen Informationssystemen auslesen lassen (wie es z.&nbsp;B. die <a href="Internet-Suchmaschine" class="mw-redirect" title="Internet-Suchmaschine">Internet-Suchmaschinen</a> praktizieren). Die in das System eingestellten Dokumente werden vom IR-System gemäß dem System-internen Modell der Repräsentation von Dokumenten in eine für die Verarbeitung günstige Form (Dokumentenrepräsentation) umgewandelt.
</p><p>Die zweite Benutzergruppe, die Anwender, haben bestimmte, zum Zeitpunkt der Arbeit am IR-System akute Ziele oder Aufgaben, für deren Lösung ihnen Informationen fehlen. Diese Informationsbedürfnisse möchten Anwender mit Hilfe des Systems decken. Dafür müssen sie ihre Informationsbedürfnisse in einer adäquaten Form als Anfragen formulieren.
</p><p>Die Form, in der die Informationsbedürfnisse formuliert werden müssen, hängt dabei von dem verwendeten Modell der Repräsentation von Dokumenten ab. Wie der Vorgang der Modellierung der Informationsbedürfnisse als Interaktion mit dem System abläuft (z.&nbsp;B. als einfache Eingabe von Suchbegriffen), wird vom Modell der Interaktion festgelegt.
</p><p>Sind die Anfragen formuliert, dann ist es die Aufgabe des IR-Systems, die Anfragen mit den im System eingestellten Dokumenten unter Verwendung der Dokumentenrepräsentationen zu vergleichen und eine Liste der zu den Anfragen passenden Dokumente an die Benutzer zurückzugeben. Der Benutzer steht nun vor der Aufgabe, die gefundenen Dokumente gemäß seiner Aufgabe auf die Lösungsrelevanz hin zu bewerten. Das Resultat sind die Bewertungen zu den Dokumenten.
</p><p>Anschließend haben die Benutzer drei Möglichkeiten:
</p>
<ul><li>Sie können (meist nur in einem engen Rahmen) Modifikationen an den Repräsentationen der Dokumente vornehmen (z.&nbsp;B. indem sie neue Schlüsselwörter für die Indexierung eines Dokuments definieren).</li>
<li>Sie verfeinern ihre formulierten Anfragen (zumeist um das Suchergebnis weiter einzuschränken)</li>
<li>Sie ändern ihre Informationsbedürfnisse, weil sie nach dem Durchführen der Recherche feststellen, dass sie zur Lösung ihrer Aufgaben weitere, zuvor nicht als relevant eingestufte Informationen benötigen.</li></ul>
<p>Der genaue Ablauf der drei Modifikationsformen wird vom Modell der Interaktion bestimmt. Zum Beispiel gibt es Systeme, die den Benutzer bei der Reformulierung der Anfrage unterstützen, indem sie die Anfrage unter Verwendung expliziter (d.&nbsp;h. dem System vom Benutzer in irgendeiner Form mitgeteilter) Dokumentenbewertungen automatisiert reformulieren.
</p>
<div class="mw-heading mw-heading2"><h2 id="Geschichte">Geschichte</h2></div>
<p>Der Begriff „Information Retrieval“ wurde erstmals 1950 von <a href="Calvin_Mooers" title="Calvin Mooers">Calvin N. Mooers</a> verwendet. <a href="Vannevar_Bush" title="Vannevar Bush">Vannevar Bush</a> beschrieb 1945 in dem Essay <i><a href="As_We_May_Think" title="As We May Think">As We May Think</a></i> im <a href="The_Atlantic" title="The Atlantic">Atlantic Monthly</a>, wie man die Nutzung des vorhandenen Wissens durch den Einsatz von Wissensspeichern revolutionieren könne. Seine Vision hieß <a href="Memex" title="Memex">Memex</a>. Dieses System sollte alle Arten von Wissensträgern speichern und mittels Links die gezielte Suche und das Stöbern nach Dokumenten ermöglichen. Bush dachte bereits an den Einsatz von Suchmaschinen und Retrievalwerkzeugen.
</p><p>Einen entscheidenden Schub erhielt die Informationswissenschaft durch die <a href="Sputnikschock" title="Sputnikschock">Sputnikschocks</a>. Der russische Satellit hielt den Amerikanern zum einen ihre eigene Rückständigkeit in der Weltraumforschung vor Augen, welche durch das <a href="Apollo-Programm" title="Apollo-Programm">Apollo-Programm</a> erfolgreich beseitigt wurde. Zum anderen – und das war der entscheidende Punkt für die Informationswissenschaft – dauerte es ein halbes Jahr, den Signalcode des Sputnik zu knacken. Und das, obwohl der Entschlüsselungscode in einer russischen Zeitschrift längst zu lesen war, welche bereits in den amerikanischen Bibliotheken stand.
</p><p>Mehr Information führt also nicht zu mehr Informiertheit. Im Gegenteil. Der sogenannte <a href="Alvin_M._Weinberg" title="Alvin M. Weinberg">Weinberg-Report</a> ist ein vom Präsidenten in Auftrag gegebenes Gutachten zu diesem Problem. Der Weinberg-Report berichtet von einer „Informationsexplosion“ und erklärt, dass Experten benötigt werden, die diese Informationsexplosion bewältigen. Also Informations-Wissenschaftler.
<a href="Hans_Peter_Luhn" title="Hans Peter Luhn">Hans Peter Luhn</a> arbeitete in den 1950er Jahren an textstatistischen Verfahren, die eine Basis für das automatische Zusammenfassen und Indexieren darstellen. Sein Ziel war es, individuelle Informationsprofile anzulegen und Suchterme hervorzuheben. Die Idee des Pushdienstes war geboren.
</p><p><a href="Eugene_Garfield" title="Eugene Garfield">Eugene Garfield</a> arbeitete in den 1950ern an <a href="Zitierindex" class="mw-redirect" title="Zitierindex">Zitierindices</a>, um so die verschiedenen Wege von Informationsübermittlung in Zeitschriften widerzuspiegeln. Dazu kopierte er Inhaltsverzeichnisse. 1960 gründete er das <a href="Institute_for_Scientific_Information" title="Institute for Scientific Information">Institute for Scientific Information</a> (ISI), eines der ersten kommerziellen Retrieval-Systeme.<sup id="cite_ref-2" class="reference"><a href="#cite_note-2"><span class="cite-bracket">[</span>2<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading3"><h3 id="Deutschland">Deutschland</h3></div>
<p>In Deutschland entwickelte Siemens zwei Systeme, GOLEM (Großspeicherorientierte, listenorganisierte Ermittlungsmethode) und PASSAT (Programm zur automatischen Selektion von Stichwörtern aus Texten). PASSAT arbeitet unter Ausschluss von <a href="Stoppwort" title="Stoppwort">Stoppwörtern</a>, bildet Wortstämme mithilfe eines Wörterbuches und gewichtet die Suchterme.
</p><p>Seit den 1960er Jahren gilt die Informationswissenschaft als etabliert.
</p>
<div class="mw-heading mw-heading3"><h3 id="Frühe_kommerzielle_Informationsdienste"><span id="Fr.C3.BChe_kommerzielle_Informationsdienste"></span>Frühe kommerzielle Informationsdienste</h3></div>
<p>DIALOG ist ein von Roger K. Summit entwickeltes interaktives System zwischen Mensch und Maschine. Es ist wirtschaftlich orientiert und geht 1972 über die Regierungsdatenbanken ERIC und NTIS online.
Das Projekt ORIBIT (heute Questel-Orbit) wurde durch Forschung und Entwicklung vorangetrieben unter der Leitung von Carlos A. Cuadra. 1962 geht das Retrievalsystem CIRC online und verschiedene Testläufe finden unter dem Codenamen COLEX statt. COLEX ist der direkte Vorläufer von Orbit, welches 1967 mit dem Schwerpunkt auf Forschungen der <a href="United_States_Air_Force" title="United States Air Force">US Air Force</a> online geht. Später verlagert sich der Schwerpunkt auf Medizininformationen. Das Suchsystem <a href="MEDLINE" title="MEDLINE">MEDLINE</a> geht 1974 für die bibliographische Medizindatenbank MEDLARS online.
OBAR ist ein von der Rechtsanwaltskammer in Ohio 1965 initiiertes Projekt. Es endet im System <a href="LexisNexis" title="LexisNexis">LexisNexis</a> und erfasst schwerpunktmäßig Rechtsinformationen. Das System basiert auf der Volltextsuche, welche optimal für die Ohio-Urteile funktioniert.
</p>
<div class="mw-heading mw-heading3"><h3 id="Suchwerkzeuge_im_World_Wide_Web">Suchwerkzeuge im World Wide Web</h3></div>
<p>Mit dem Internet wird Information Retrieval zum Massenphänomen. Ein Vorläufer war das ab 1991 verbreitete System <a href="Wide_Area_Information_Servers" title="Wide Area Information Servers">WAIS</a>, das verteiltes Retrieval im Internet ermöglichte. Die frühen Web-Browser <a href="NCSA_Mosaic" title="NCSA Mosaic">NCSA Mosaic</a> und <a href="Netscape_Navigator" title="Netscape Navigator">Netscape Navigator</a> unterstützen das WAIS-Protokoll, bevor die Internet-<a href="Suchmaschine" title="Suchmaschine">Suchmaschinen</a> aufkamen und später dazu übergingen, auch Nicht-HTML-Dokumente zu indexieren. Zu den bekanntesten und populärsten Suchmaschinen gehören derzeit <a href="Google_Suche" class="mw-redirect" title="Google Suche">Google</a>, <a href="Bing_(Suchmaschine)" class="mw-redirect" title="Bing (Suchmaschine)">Bing</a>, <a href="Yandex" title="Yandex">Yandex</a> (Russland) und <a href="Baidu" title="Baidu">Baidu</a> (China). Verbreitete Suchmaschinen für Intranets sind Autonomy, Convera, FAST, Verity sowie die Open-Source-Software Apache <a href="Lucene" class="mw-redirect" title="Lucene">Lucene</a>.
</p>
<div class="mw-heading mw-heading2"><h2 id="Grundbegriffe">Grundbegriffe</h2></div>
<div class="mw-heading mw-heading3"><h3 id="Informationsbedarf">Informationsbedarf</h3></div>
<p>Der Informationsbedarf ist der Bedarf an handlungsrelevantem Wissen und kann dabei konkret und problemorientiert sein. Beim konkreten Informationsbedarf wird eine Fakteninformation benötigt. Also beispielsweise "Was ist die Hauptstadt von Frankreich?". Die Antwort "Paris" deckt den Informationsbedarf vollständig. Anders ist es beim problemorientierten Informationsbedarf. Hier werden mehrere Dokumente benötigt, um den Bedarf zu stillen. Zudem wird der problemorientierte Informationsbedarf nie ganz gedeckt werden können. Gegebenenfalls ergibt sich aus der erhaltenen Information sogar ein neuer Bedarf oder die Modifikation des ursprünglichen Bedarfs.
Beim Informationsbedarf wird vom Nutzer abstrahiert. Das heißt, es wird der objektive Sachverhalt betrachtet.
</p>
<div class="mw-heading mw-heading3"><h3 id="Informationsbedürfnis"><span id="Informationsbed.C3.BCrfnis"></span>Informationsbedürfnis</h3></div>
<p>Das Informationsbedürfnis spiegelt den konkreten Bedarf beim anfragenden Nutzer wider. Es geht um das subjektive Bedürfnis des Nutzers.
</p>
<div class="mw-heading mw-heading3"><h3 id="Information_Indexing_und_Information_Retrieval">Information Indexing und Information Retrieval</h3></div>
<p>Um eine Suchanfrage so präzise wie möglich formulieren zu können, müsste man eigentlich wissen, was man nicht weiß. Es muss also ein Basiswissen vorhanden sein, um eine adäquate Suchanfrage zu verfassen. Zudem muss die natürlichsprachige Suchanfrage in eine Variante umgewandelt werden, die vom Retrievalsystem gelesen werden kann.
Hier einige Beispiele für Suchanfrageformulierungen in verschiedenen Datenbanken. Gesucht werden Informationen über den Schauspieler "Johnny Depp" im Kinofilm "Chocolat".
</p><p>LexisNexis:
HEADLINE:(„Johnny Depp“ w/5 „Chocolat“)
</p><p>DIALOG:
(Johnny ADJ Depp AND Chocolat) ti
</p><p>Google:
“Chocolat” “Johnny Depp”
</p><p>Der Nutzer gibt dabei vor, wie der Retrievalprozess abläuft, und zwar dies durch die Art und Weise seiner Suchanfrageformulierung im jeweils verwendeten System. Zu unterscheiden sind wort- und begrifforientierte Systeme. Begrifforientierte Systeme können die Mehrdeutigkeiten von Wörtern erkennen (z.&nbsp;B. Java = die Insel, Java = der Kaffee oder Java = die Programmiersprache).
Über die Suchanfrage wird die Dokumentationseinheit (DE) angesprochen. Die DE stellt den informationellen Mehrwert der Dokumente dar. Das bedeutet, in der DE wird Information zu Autor, Jahrgang etc. verdichtet wiedergegeben. Je nach Datenbank werden entweder das komplette Dokument oder nur Teile davon erfasst.
</p>
<div class="mw-heading mw-heading3"><h3 id="Dokumentarische_Bezugseinheit_und_Dokumentationseinheit">Dokumentarische Bezugseinheit und Dokumentationseinheit</h3></div>
<p>Weder die Dokumentarische Bezugseinheit (DBE) noch die Dokumentationseinheit (DE) sind das Originaldokument. Beide sind nur Stellvertreter desselben in der Datenbank.
Zuerst wird die Dokumentationswürdigkeit eines Dokumentes geprüft. Das findet über formale und inhaltliche Kriterienkataloge statt. Ist ein Objekt für dokumentenwürdig befunden, wird eine DBE erstellt. Hier entscheidet sich, in welcher Form das Dokument abgespeichert wird. Werden einzelne Kapitel oder Seiten als DBE genommen oder das Dokument im Ganzen?
Es schließt sich der informationspraktische Prozess an. Die DBE werden formal beschrieben und der Inhalt verdichtet. Dieser informationelle Mehrwert findet sich dann in der DE wieder, die als Stellvertreter für die DBE dient. Die DE repräsentiert die DBE und steht somit am Ende des Dokumentationsprozesses.
Die DE dient dem Nutzer dazu, eine Entscheidung darüber zu treffen, ob er die DBE gebrauchen kann und anfordert oder eben nicht.
Information Retrieval und Information Indexing sind aufeinander abgestimmt.
</p>
<div class="mw-heading mw-heading3"><h3 id="Kognitive_Modelle">Kognitive Modelle</h3></div>
<p>Diese sind Teil der empirischen Informationswissenschaft, da sie sich auf die Vorkenntnisse, den sozio-ökonomischen Hintergrund, die Sprachkenntnisse usw. der Nutzer beziehen und darüber Informationsbedarfs-, Nutzungs- und Nutzeranalysen anstellen.
</p>
<div class="mw-heading mw-heading3"><h3 id="Pull-_und_Pushdienste">Pull- und Pushdienste</h3></div>
<p>Das Suchen nach Informationen beschreibt Marcia J. Bates als <a href="Berrypicking" title="Berrypicking">Berrypicking</a> (dt. <i>Beeren pflücken</i>). Es reicht nicht aus, nur an einem Strauch respektive einer Datenbank nach Beeren bzw. Informationen zu suchen, damit der Korb voll wird. Es müssen mehrere Datenbanken angefragt und die Suchanfrage aufgrund neuer Informationen ständig modifiziert werden.
Pulldienste werden überall da zur Verfügung gestellt, wo der Nutzer aktiv nach Informationen suchen kann.
Pushdienste versorgen den Nutzer aufgrund eines abgespeicherten Informationsprofils mit Informationen. Diese Profildienste, sogenannte Alerts, speichern erfolgreich formulierte Suchanfragen ab und informieren den Nutzer über das Eintreffen neuer relevanter Dokumente.
</p>
<div class="mw-heading mw-heading3"><h3 id="Informationsbarrieren">Informationsbarrieren</h3></div>
<p>Den Informationsfluss behindern verschiedene Faktoren. Solche Faktoren sind beispielsweise Zeit, Ort, Sprache, Gesetze und die Finanzierung.
</p>
<div class="mw-heading mw-heading3"><h3 id="Recall_und_Precision">Recall und Precision</h3></div>
<div class="hauptartikel" role="navigation"><span class="hauptartikel-pfeil" title="siehe" aria-hidden="true" role="presentation">→&nbsp;</span><i><span class="hauptartikel-text">Hauptartikel</span>: <a href="Beurteilung_eines_Klassifikators" class="mw-redirect" title="Beurteilung eines Klassifikators">Beurteilung eines Klassifikators</a></i></div>
<p>Der Recall bezeichnet die Vollständigkeit der angezeigten Treffermenge. Die Precision dagegen berechnet die Genauigkeit der Dokumente aus der Treffermenge zu einer Suchanfrage.
Precision bezeichnet den Anteil aller relevanten Dokumente an den selektierten Dokumenten einer Suchanfrage und ist damit das Maß der in der Trefferliste enthaltenen bezüglich der Aufgabenstellung bedeutungsvollen Dokumente. Recall hingegen beschreibt den Anteil aller relevanten Dokumente an der Gesamtzahl relevanter Dokumente der Dokumentensammlung. Dabei handelt es sich um das Maß für die Vollständigkeit einer Trefferliste. Beide Maße bilden entscheidende Kennzahlen für ein Information Retrieval-System. Ein ideales System würde in einer Suchanfrage alle relevanten Dokumente einer Dokumentensammlung unter Ausschluss nicht zutreffender Dokumente selektieren.
</p><p>Recall: <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle a/(a+c)}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>a</mi>
<mrow class="MJX-TeXAtom-ORD">
<mo>/</mo>
</mrow>
<mo stretchy="false">(</mo>
<mi>a</mi>
<mo>+</mo>
<mi>c</mi>
<mo stretchy="false">)</mo>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle a/(a+c)}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/a2aa6a6ea0f587be8028c1774c564eda26bcbbe1.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.838ex; width:9.279ex; height:2.843ex;" alt="{\displaystyle a/(a+c)}" loading="lazy"></span>
</p><p>Precision: <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle a/(a+b)}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>a</mi>
<mrow class="MJX-TeXAtom-ORD">
<mo>/</mo>
</mrow>
<mo stretchy="false">(</mo>
<mi>a</mi>
<mo>+</mo>
<mi>b</mi>
<mo stretchy="false">)</mo>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle a/(a+b)}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/af8abd6c07896dcf2e482ce4149c6c7a121dd9db.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.838ex; width:9.269ex; height:2.843ex;" alt="{\displaystyle a/(a+b)}" loading="lazy"></span>
</p><p>a = gefundene, relevante Treffer
</p><p>b = gefundene, nichtrelevante DE / Ballast
</p><p>c = relevante DE, die nicht gefunden wurden / Verlust
</p><p>„c“ ist nicht direkt messbar, da man ja nicht wissen kann, wie viele DE nicht gefunden wurden, sofern man den Inhalt der Datenbank bzw. die DE nicht kennt, die aufgrund der Suchanfrage eigentlich hätten angezeigt werden müssen.
Der Recall kann auf Kosten der Precision vergrößert werden und umgekehrt. Das gilt allerdings nicht bei einer Faktenfrage. Hier sind Recall und Precision gleich eins.
</p>
<div class="mw-heading mw-heading2"><h2 id="Relevanz_und_Pertinenz">Relevanz und Pertinenz</h2></div>
<p>Wissen kann relevant, muss aber nicht pertinent sein. Relevanz bedeutet, dass ein Dokument unter der Suchanfrage, die formuliert wurde, passend ausgegeben wurde. Wenn der Nutzer den Text aber bereits kennt oder er ihn nicht lesen will, weil er den Autor nicht mag oder keine Lust hat, einen Artikel in einer anderen Sprache zu lesen, ist das Dokument nicht pertinent. Pertinenz bezieht die subjektive Sicht des Nutzers mit ein.
</p>
<table class="wikitable">
<tbody><tr>
<td>Objektiver Informationsbedarf</td>
<td>Subjektives Informationsbedürfnis (=Informationsnachfrage)
</td></tr>
<tr>
<td>→ Relevanz</td>
<td>→ Pertinenz
</td></tr>
<tr>
<td>Ein Dokument ist zur Befriedigung eines Informationsbedarfs relevant, wenn es objektiv:</td>
<td>Ein Dokument ist zur Befriedigung eines Informationsbedürfnisses pertinent, wenn es subjektiv:
</td></tr>
<tr>
<td>Zur Vorbereitung einer Entscheidung dient</td>
<td>Zur Vorbereitung einer Entscheidung dient
</td></tr>
<tr>
<td>Eine Wissenslücke schließt</td>
<td>Eine Wissenslücke schließt
</td></tr>
<tr>
<td>Eine Frühwarnfunktion erfüllt</td>
<td>Eine Frühwarnfunktion erfüllt
</td></tr></tbody></table>
<p>Voraussetzungen für erfolgreiches Information Retrieval sind das richtige Wissen, zum richtigen Zeitpunkt, am richtigen Ort, im richtigen Umfang, in der richtigen Form, mit der richtigen Qualität. Wobei "richtig" heißt, dass dieses Wissen entweder Pertinenz oder Relevanz besitzt.
</p>
<div class="mw-heading mw-heading3"><h3 id="Nützlichkeit"><span id="N.C3.BCtzlichkeit"></span>Nützlichkeit</h3></div>
<p>Wissen ist dann nützlich, wenn der Nutzer daraus neues handlungsrelevantes Wissen erzeugt und dieses in die Praxis umsetzt.
</p>
<div class="mw-heading mw-heading3"><h3 id="Aspekte_der_Relevanz">Aspekte der Relevanz</h3></div>
<p>Relevanz ist die Relation zwischen der Suchanfrage (query) in Bezug auf das Thema und die systemseitigen Aspekte.
</p>
<div class="mw-heading mw-heading3"><h3 id="Binärer_Ansatz"><span id="Bin.C3.A4rer_Ansatz"></span>Binärer Ansatz</h3></div>
<p>Der binäre Ansatz sagt aus, dass ein Dokument entweder relevant oder nicht-relevant ist. In der Realität ist das nicht unbedingt zutreffend. Hier spricht man eher von „Relevanzregionen“.
</p><p>Der Grundgedanke dieses Ansatz ist die Berechnung der Wahrscheinlichkeit für den Fall, dass ein Dokument <i>D</i> für eine Anfrage <i>Q</i> relevant ist. Wenn R<sup>+</sup>(Q) die Menge der relevanten Dokumente ist, so wird für jedes Dokument <i>D</i> die Wahrscheinlichkeit gesucht:
</p><p><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle P(D\in R^{+}(Q))}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>P</mi>
<mo stretchy="false">(</mo>
<mi>D</mi>
<mo>∈<!-- ∈ --></mo>
<msup>
<mi>R</mi>
<mrow class="MJX-TeXAtom-ORD">
<mo>+</mo>
</mrow>
</msup>
<mo stretchy="false">(</mo>
<mi>Q</mi>
<mo stretchy="false">)</mo>
<mo stretchy="false">)</mo>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle P(D\in R^{+}(Q))}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/c725dd38577ac8ed8ac1645c94704a65470bc71d.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.838ex; width:15.242ex; height:3.009ex;" alt="{\displaystyle P(D\in R^{+}(Q))}" loading="lazy"></span><sup id="cite_ref-:0_1-1" class="reference"><a href="#cite_note-:0-1"><span class="cite-bracket">[</span>1<span class="cite-bracket">]</span></a></sup>
</p>
<div class="mw-heading mw-heading3"><h3 id="Relevanzverteilungen">Relevanzverteilungen</h3></div>
<p>Dafür können beispielsweise Themenketten gebildet werden. Ein Thema kann in mehreren Ketten vorkommen. Je häufiger ein Thema vorkommt, desto größer ist sein Gewichtungswert. Kommt das Thema in allen Ketten vor, liegt sein Wert bei 100; kommt es in keiner Kette vor, bei 0.
Bei Untersuchungen haben sich drei verschiedene Verteilungen herauskristallisiert. Dabei ist anzumerken, dass diese Verteilungen nur bei größeren Dokumentenmengen zustande kommen. Bei kleineren Dokumentenmengen gibt es eventuell gar keine Regelmäßigkeiten.
</p>
<div class="mw-heading mw-heading4"><h4 id="Binäre_Verteilung"><span id="Bin.C3.A4re_Verteilung"></span>Binäre Verteilung</h4></div>
<p>Bei der binären Verteilung ist kein Relevanceranking möglich.
</p>
<div class="mw-heading mw-heading4"><h4 id="Invers-logistische_Verteilung">Invers-logistische Verteilung</h4></div>

<p><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle f(x)=e^{-C}(x-1)^{b}}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>f</mi>
<mo stretchy="false">(</mo>
<mi>x</mi>
<mo stretchy="false">)</mo>
<mo>=</mo>
<msup>
<mi>e</mi>
<mrow class="MJX-TeXAtom-ORD">
<mo>−<!-- − --></mo>
<mi>C</mi>
</mrow>
</msup>
<mo stretchy="false">(</mo>
<mi>x</mi>
<mo>−<!-- − --></mo>
<mn>1</mn>
<msup>
<mo stretchy="false">)</mo>
<mrow class="MJX-TeXAtom-ORD">
<mi>b</mi>
</mrow>
</msup>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle f(x)=e^{-C}(x-1)^{b}}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/a0fa7777f7db888a8affdd7d5a89cc4d29f4c16c.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.838ex; width:19.439ex; height:3.176ex;" alt="{\displaystyle f(x)=e^{-C}(x-1)^{b}}" loading="lazy"></span>
</p>
<ul><li><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle x}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>x</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle x}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/87f9e315fd7e2ba406057a97300593c4802b53e4.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:1.33ex; height:1.676ex;" alt="{\displaystyle x}" loading="lazy"></span>: Rangplatz</li>
<li><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle e}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>e</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle e}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/cd253103f0876afc68ebead27a5aa9867d927467.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:1.083ex; height:1.676ex;" alt="{\displaystyle e}" loading="lazy"></span>: <a href="Eulersche_Zahl" title="Eulersche Zahl">Eulersche Zahl</a></li>
<li><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle c}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>c</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle c}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/86a67b81c2de995bd608d5b2df50cd8cd7d92455.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:1.007ex; height:1.676ex;" alt="{\displaystyle c}" loading="lazy"></span>: Konstante</li>
<li><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle b\approx 3}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>b</mi>
<mo>≈<!-- ≈ --></mo>
<mn>3</mn>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle b\approx 3}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/9a7bfd798d7e6e8236f70dc00e5c4e49c0e2e019.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:5.258ex; height:2.176ex;" alt="{\displaystyle b\approx 3}" loading="lazy"></span></li></ul>
<div class="mw-heading mw-heading4"><h4 id="Informetrische_Verteilung">Informetrische Verteilung</h4></div>
<p><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle f(x)={\frac {C}{x^{a}}}}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>f</mi>
<mo stretchy="false">(</mo>
<mi>x</mi>
<mo stretchy="false">)</mo>
<mo>=</mo>
<mrow class="MJX-TeXAtom-ORD">
<mfrac>
<mi>C</mi>
<msup>
<mi>x</mi>
<mrow class="MJX-TeXAtom-ORD">
<mi>a</mi>
</mrow>
</msup>
</mfrac>
</mrow>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle f(x)={\frac {C}{x^{a}}}}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/24c23778826d0489087aa7182c93ee1174673529.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -1.838ex; width:10.784ex; height:5.343ex;" alt="{\displaystyle f(x)={\frac {C}{x^{a}}}}" loading="lazy"></span>
</p>
<ul><li><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle x}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>x</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle x}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/87f9e315fd7e2ba406057a97300593c4802b53e4.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:1.33ex; height:1.676ex;" alt="{\displaystyle x}" loading="lazy"></span>: Rangplatz</li>
<li><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle c}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>c</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle c}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/86a67b81c2de995bd608d5b2df50cd8cd7d92455.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:1.007ex; height:1.676ex;" alt="{\displaystyle c}" loading="lazy"></span>: Konstante</li>
<li><span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle a}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>a</mi>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle a}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/ffd2487510aa438433a2579450ab2b3d557e5edc.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:1.23ex; height:1.676ex;" alt="{\displaystyle a}" loading="lazy"></span>: konkreter Wert zwischen 1 und 2</li></ul>
<p>Die informetrische Verteilung sagt aus: Wenn das erstplatzierte Dokument eine Relevanz von eins hat (bei <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle C=1}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>C</mi>
<mo>=</mo>
<mn>1</mn>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle C=1}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/605a443c472808db9a502a801b8a2dfa5ee15d08.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:6.027ex; height:2.176ex;" alt="{\displaystyle C=1}" loading="lazy"></span>), dann hat das zweitplatzierte Dokument eine Relevanz von 0,5 (bei <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle a=1}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>a</mi>
<mo>=</mo>
<mn>1</mn>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle a=1}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/6104442ed30596ef4d7795d3186273f68d796ea4.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:5.491ex; height:2.176ex;" alt="{\displaystyle a=1}" loading="lazy"></span>) oder von 0,25 (bei <span class="mwe-math-element mwe-math-element-inline"><span class="mwe-math-mathml-inline mwe-math-mathml-a11y" style="display: none;"><math xmlns="http://www.w3.org/1998/Math/MathML" alttext="{\displaystyle a=2}">
<semantics>
<mrow class="MJX-TeXAtom-ORD">
<mstyle displaystyle="true" scriptlevel="0">
<mi>a</mi>
<mo>=</mo>
<mn>2</mn>
</mstyle>
</mrow>
<annotation encoding="application/x-tex">{\displaystyle a=2}</annotation>
</semantics>
</math></span><img src="./_assets_/eb734a37dd21ce173a46342d1cc64c92/4208bf5a67fc2ceb3a3bcd75aebb1d74fbb531bd.svg" class="mwe-math-fallback-image-inline mw-invert skin-invert" aria-hidden="true" style="vertical-align: -0.338ex; width:5.491ex; height:2.176ex;" alt="{\displaystyle a=2}" loading="lazy"></span>).
</p>
<div class="mw-heading mw-heading2"><h2 id="Dokumente">Dokumente</h2></div>
<p>Es sei noch einmal darauf hingewiesen, dass in der Informationswissenschaft unterschieden wird zwischen dem Ausgangsdokument, der DBE und der DE.
Aber wann ist „etwas“ eigentlich ein Dokument? Das entscheiden vier Kriterien: die Materialität (einschließlich des digitalen Vorhandenseins), die Intentionalität (Das Dokument trägt einen gewissen Sinn, eine Bedeutung), die Erarbeitung und die Wahrnehmung.
</p>
<dl><dd><i>"They have to be made into documents"</i> Michael K. Buckland</dd></dl>
<div class="mw-heading mw-heading3"><h3 id="Textuelle_und_nicht-textuelle_Objekte">Textuelle und nicht-textuelle Objekte</h3></div>
<p>Objekte können in Textform auftreten, müssen es aber nicht. Bilder und Filme sind Beispiele für nicht-textuelle Dokumente. Textuelle und nicht-textuelle Objekte können in digitaler und in nicht-digitaler Form auftreten. Sind sie digital und treffen mehr als zwei Medienformen aufeinander (Ein Dokument besteht beispielsweise aus einer Videosequenz, einer Audiosequenz und Bildern), nennt man sie Multimedia. Die nicht-digital vorliegenden Objekte brauchen in der Datenbank einen digitalen Stellvertreter, etwa ein Foto.
</p>
<div class="mw-heading mw-heading3"><h3 id="Formal_publizierte_Textdokumente">Formal publizierte Textdokumente</h3></div>
<p>Als formal publizierte Textdokumente werden alle Dokumente bezeichnet, die einen formalen Veröffentlichungsprozess durchlaufen haben. Das bedeutet, die Dokumente wurden vor der Veröffentlichung geprüft (z.&nbsp;B. durch einen Lektor). Ein Problem stellt die sogenannte „Graue Literatur“ dar. Diese ist zwar geprüft, aber nicht veröffentlicht worden.
</p><p>Es existieren mehrere Ebenen von formal publizierten Dokumenten. Am Anfang steht die Arbeit, die Schöpfung des Autors. Gefolgt vom Ausdruck dieser Arbeit, der konkreten Realisierung (z.&nbsp;B. verschiedene Übersetzungen). Diese Realisierung wird manifestiert (z.&nbsp;B. in einem Buch). An unterster Stelle dieser Kette steht das Item, das einzelne Exemplar. In der Regel richtet sich die DBE auf die Manifestation. Ausnahmen sind aber möglich.
</p>
<div class="mw-heading mw-heading3"><h3 id="Informell_publizierte_Texte">Informell publizierte Texte</h3></div>
<p>Zu den informell publizierten Texten gehören vor allem Dokumente, die im Internet veröffentlicht wurden. Diese Dokumente sind zwar publiziert, aber nicht geprüft.
</p><p>Eine Zwischenstufe von formell und informell publizierten Texten sind beispielsweise Wikis. Diese sind publiziert und kooperativ geprüft.
</p>
<div class="mw-heading mw-heading3"><h3 id="Nicht_publizierte_Texte">Nicht publizierte Texte</h3></div>
<p>Hierzu zählen Briefe, Rechnung, interne Berichte, Dokumente im Intranet oder Extranet. Eben alle Dokumente, die nie öffentlich gemacht wurden.
</p>
<div class="mw-heading mw-heading3"><h3 id="Nicht-textuelle_Dokumente">Nicht-textuelle Dokumente</h3></div>
<p>Bei den nicht-textuellen Dokumenten unterscheidet man zwei Gruppen. Zum einen die digital vorliegenden oder digitalisierbaren Dokumente, wie Filme, Bilder und Musik und zum anderen die nicht digitalen und nicht digitalisierbaren Dokumente. Zu letzteren gehören Fakten, wie chemische Stoffe und deren Eigenschaften und Reaktionen, Patienten und deren Symptome und Museumsobjekte. Die meisten nicht digitalisierbaren Dokumente entstammen den Disziplinen Chemie, Medizin und Wirtschaft. Sie werden in der Datenbank von der DE vertreten und oftmals zusätzlich durch Bilder, Videos und Audiodateien dargestellt.
</p>
<div class="mw-heading mw-heading2"><h2 id="Typologie_von_Retrievalsystemen">Typologie von Retrievalsystemen</h2></div>
<div class="mw-heading mw-heading3"><h3 id="Struktur_von_Texten">Struktur von Texten</h3></div>
<p>Man differenziert zwischen strukturierten, schwach strukturierten und nicht-strukturierten Texten. Zu den schwach strukturierten Texten zählen alle Arten von Textdokumenten, die eine gewisse Struktur haben. Dazu zählen Kapitelnummern, Titel, Zwischenüberschriften, Abbildungen, Seitenzahlen etc. Über informationelle Mehrwerte können den Texten strukturierte Daten hinzugefügt werden.
Nicht-strukturierte Texte kommen in der Realität kaum vor. In der Informationswissenschaft beschäftigt man sich hauptsächlich mit schwach strukturierten Texten.
Dabei ist zu beachten, dass es nur um formale, nicht um syntaktische Strukturen geht. Es ergibt sich ein Problem mit dem Sinnzusammenhang der Inhalte.
</p><p>„The man saw the pyramid on the hill with the telescope.“ Dieser Satz kann vierfach interpretiert werden. Daher bevorzugen einige Anbieter menschliche Indexer, da diese den Sinnzusammenhang erkennen und korrekt weiterverarbeiten können.
</p><p>Information Retrievalsysteme können entweder mit oder ohne terminologische Kontrolle arbeiten. Arbeiten sie mit terminologischer Kontrolle, ergeben sich die Möglichkeiten sowohl intellektuell, als auch automatisch zu indexieren. Retrieval Systeme die ohne terminologische Kontrolle arbeiten, bearbeiten entweder den reinen Text oder der Prozess läuft über eine automatische Bearbeitung.
</p>
<div class="mw-heading mw-heading3"><h3 id="Retrievalsysteme_und_terminologische_Kontrolle">Retrievalsysteme und terminologische Kontrolle</h3></div>
<p>Terminologische Kontrolle bedeutet nichts anderes als die Verwendung von kontrolliertem Vokabular. Das erfolgt über Dokumentationssprachen (Klassifikationen, Schlagwortmethode, Thesauri, Ontologien). Die Vorteile liegen darin, dass der Rechercheur und der Indexer über dieselben Ausdrücke und Formulierungsmöglichkeiten verfügen. Daher ergeben sich keine Probleme mit Synonymen und Homonymen. Nachteile von kontrolliertem Vokabular sind etwa die mangelnde Berücksichtigung von Sprachentwicklungen, sowie das Problem, dass diese Kunstsprachen nicht von jedem Nutzer korrekt angewandt werden.
Eine weitere Rolle spielt natürlich der Preis. Intellektuelles Indexieren ist sehr viel teurer als automatisches.
</p><p>Insgesamt lassen sich vier Fälle unterscheiden:
</p>
<table class="wikitable">
<tbody><tr>
<th>Rechercheur</th>
<th>Indexer
</th></tr>
<tr>
<td>Kontrolliertes Vokabular → Fachleute</td>
<td>Kontrolliertes Vokabular
</td></tr>
<tr>
<td>Natürlichsprachig → Kontrolliertes Vokabular wirkt im Hintergrund durch Suchanfrageerweiterung mittels Ober- und Unterbegriffen mit</td>
<td>Natürlichsprachig → Kontrolliertes Vokabular wirkt im Hintergrund durch Suchanfrageerweiterung mittels Ober- und Unterbegriffen mit
</td></tr>
<tr>
<td>Natürlichsprachig → System leistet Übersetzungsarbeit</td>
<td>Kontrolliertes Vokabular
</td></tr>
<tr>
<td>Kontrolliertes Vokabular</td>
<td>Natürlichsprachiges Vokabular
</td></tr></tbody></table>
<p>Bei der Variante ohne terminologische Kontrolle wird am besten mit den Volltexten gearbeitet. Das funktioniert allerdings nur bei sehr kleinen Datenbanken. Die Terminologie der Dokumente muss von den Nutzern genau gekannt werden.
Der Prozess mit terminologischer Kontrolle setzt eine informationslinguistische Bearbeitung (Natural Language Processing = NLP) der Dokumente voraus.
</p>
<div class="mw-heading mw-heading3"><h3 id="Informationslinguistische_Textbearbeitung">Informationslinguistische Textbearbeitung</h3></div>
<p>Die <a href="Informationslinguistik" title="Informationslinguistik">informationslinguistische</a> Textbearbeitung geht wie folgt vor. Zuerst wird das Schriftsystem erkannt. Ist es beispielsweise ein lateinisches oder arabisches Schriftsystem. Danach folgt die Spracherkennung. Nun werden Text, Layout und Navigation voneinander getrennt. An dieser Stelle gibt es zwei Möglichkeiten. Zum einen die Zerlegung der Wörter in n-Gramme oder die Worterkennung. Egal für welche Methode man sich entscheidet, schließen sich Stoppwortmarkierung, Eingabefehlererkennung und -korrektur sowie Eigennamenerkennung und die Bildung von Grund- bzw. Stammformen an. Es werden Komposita zerlegt, Homonyme und Synonyme erkannt und abgeglichen und das semantische Umfeld oder das Umfeld nach Ähnlichkeit untersucht. Die letzten beiden Schritte sind die Übersetzung des Dokumentes und die Anaphoraauflösung. Es kann nötig sein, dass während des Ablaufes das System mit dem Nutzer in Verbindung tritt.
</p>
<div class="mw-heading mw-heading2"><h2 id="Retrievalmodelle">Retrievalmodelle</h2></div>
<p>Es existieren mehrere konkurrierende Retrievalmodelle, die sich aber keineswegs ausschließen müssen. Zu diesen Modellen zählen das Boolesche und das erweiterte <a href="Boolesches_Retrieval" title="Boolesches Retrieval">Boolesche Modell</a>. Das <a href="Vektorraum-Retrieval" title="Vektorraum-Retrieval">Vektorraummodell</a> und das <a href="Probabilistik" class="mw-redirect" title="Probabilistik">probabilistische Modell</a> sind Modelle, die auf der Textstatistik beruhen. Zu den Linktopologischen Modellen gehören der <a href="Kleinberg-Algorithmus" class="mw-redirect" title="Kleinberg-Algorithmus">Kleinberg-Algorithmus</a> und der <a href="PageRank" title="PageRank">PageRank</a>. Schließlich gibt es noch das Netzwerkmodell und die Nutzer-/Nutzungsmodelle, welche die Textnutzung und den Nutzer an seinem spezifischen Standort untersuchen.
</p>
<div class="mw-heading mw-heading3"><h3 id="Boolesches_Modell">Boolesches Modell</h3></div>
<p><a href="George_Boole" title="George Boole">George Boole</a> veröffentlichte 1854 seine „Boolesche Logik“ und ihre binäre Sicht der Dinge. Sein System hat drei Funktionen oder auch Operatoren: UND, ODER und NICHT. Bei diesem System ist keine Sortierung nach Relevanz möglich. Um ein Relevanzranking zu ermöglichen, wurde das Boolesche Modell um Gewichtungswerte erweitert und die Operatoren mussten uminterpretiert werden.
</p>
<div class="mw-heading mw-heading3"><h3 id="Textstatistik">Textstatistik</h3></div>
<p>In der Textstatistik werden die im Dokument auftretenden Terme analysiert. Die Gewichtungsfaktoren heißen hier WDF und IDF.
</p><p><a href="Within-document_Frequency" title="Within-document Frequency">Within-document Frequency</a> (WDF): Anzahl des vorkommenden Terms / Anzahl aller Wörter
</p><p>Der WDF beschreibt die Häufigkeit eines Wortes in einem Dokument. Je häufiger ein Wort in einem Dokument vorkommt, desto größer sein WDF.
</p><p><a href="Inverse_Dokumenth%C3%A4ufigkeit" title="Inverse Dokumenthäufigkeit">Inverse Dokumenthäufigkeit</a> <span style="font-style:normal;font-weight:normal"><a href="Englische_Sprache" title="Englische Sprache">englisch</a></span> <span lang="en-Latn" style="font-style:italic"><i>Inverse document frequency weight</i> (IDF)</span> Gesamte Anzahl an Dokumenten in der Datenbank / Anzahl der Dokumente mit dem Term
</p><p>Der IDF beschreibt die Häufigkeit, mit der ein Dokument mit einem bestimmten Term in einer Datenbank vorkommt. Je häufiger ein Dokument mit einem bestimmten Term in der Datenbank vorkommt, desto kleiner sein IDF.
</p><p>Die zwei klassischen Modelle der Textstatistik sind das Vektorraummodell und das probabilistische Modell.
Im Vektorraummodell spannen n-Wörter einen n-dimensionalen Raum auf. Die Ähnlichkeit der Wörter zueinander wird über die Winkel ihrer Vektoren zueinander berechnet.
Beim probabilistischen Modell wird die Wahrscheinlichkeit berechnet, mit der ein Dokument auf eine Suchanfrage zutrifft. Ohne Zusatzinformationen ist das probabilistische Modell dem IDF ähnlich.
</p>
<div class="mw-heading mw-heading3"><h3 id="Linktopologische_Modelle">Linktopologische Modelle</h3></div>
<p>Dokumente sind im WWW untereinander und miteinander verlinkt. Sie bilden somit einen Raum von Links.
Der <a href="Kleinberg-Algorithmus" class="mw-redirect" title="Kleinberg-Algorithmus">Kleinberg-Algorithmus</a> nennt diese Links „Hub“ (ausgehende Links) und „Authority“ (eingehende Links). Die Gewichtungswerte entstehen darüber, inwiefern Hubs auf „gute“ Authorities treffen und Authorities von „guten“ Hubs gelinkt werden.
Ein weiteres linktopologisches Modell ist der <a href="PageRank" title="PageRank">PageRank</a> von Sergey Brin und Lawrence Page. Er beschreibt die Wahrscheinlichkeit, mit der ein nach dem Zufallsprinzip Surfender eine Seite findet.
</p>
<div class="mw-heading mw-heading3"><h3 id="Clustermodell">Clustermodell</h3></div>
<p>Clusterverfahren versuchen, Dokumente zu klassifizieren, so dass ähnliche oder miteinander in Beziehung stehende Dokumente in einem gemeinsamen Dokumentenpool zusammengefasst werden. Dadurch tritt eine Beschleunigung des Suchverfahrens ein, da sämtliche relevanten Dokumente im günstigsten Fall mit einem einzigen Zugriff selektiert werden können. Neben Dokumentenähnlichkeiten spielen aber auch Synonyme als semantisch ähnliche Wörter eine bedeutende Rolle. So sollte eine Suche nach dem Begriff „Wort“ auch eine Trefferliste für Kommentar, Bemerkung, Behauptung oder Term präsentieren.
</p><p>Probleme entstehen aus der Art der Zusammenfassung von Dokumenten:
</p>
<ul><li>Die Cluster müssen stabil und vollständig sein.</li>
<li>Die Zahl der Dokumente in einem Cluster und damit die resultierende Trefferliste kann bei speziellen Dokumentationen mit homogenen Dokumenten sehr hoch sein. Im umgekehrten Fall kann die Zahl der Cluster wachsen bis zum Extremfall, in dem Cluster nur aus jeweils einem Dokument bestehen.</li>
<li>Die Überschneidungsrate der Dokumente, die in mehr als einem Cluster liegen, ist kaum kontrollierbar.</li></ul>
<div class="mw-heading mw-heading3"><h3 id="Nutzer-Nutzungsmodell">Nutzer-Nutzungsmodell</h3></div>
<p>Bei dem Nutzer-Nutzungsmodell ist die Häufigkeit der Nutzung einer Website ein Rangkriterium. Zusätzlich fließen Hintergrundinformationen beispielsweise über den Standort des Nutzers bei geographischen Anfragen mit ein.
</p><p>Beim systematischen Suchen ergeben sich Rückkopplungsschleifen. Diese laufen entweder automatisch oder der Nutzer wird wiederholt aufgefordert, Ergebnisse als relevant oder nicht-relevant zu markieren, ehe die Suchanfrage modifiziert und wiederholt wird.
</p>
<div class="mw-heading mw-heading3"><h3 id="Oberflächenweb_und_Deep_Web"><span id="Oberfl.C3.A4chenweb_und_Deep_Web"></span>Oberflächenweb und Deep Web</h3></div>
<p>Das Oberflächenweb liegt im Web und ist kostenlos für alle Nutzer erreichbar. Im Deep Web liegen etwa Datenbanken, deren Suchoberflächen über das Oberflächenweb zu erreichen sind. Ihre Informationen sind aber in der Regel kostenpflichtig.
Es lassen sich drei Arten von Suchmaschinen unterscheiden. Suchmaschinen wie Google arbeiten algorithmisch, das <a href="Open_Directory_Project" class="mw-redirect" title="Open Directory Project">Open Directory Project</a> ist ein intellektuell erstellter Webkatalog und Metasuchmaschinen beziehen ihren Content aus mehreren anderen Suchmaschinen, die sich ansprechen. In der Regel verwenden intellektuell erstellte Webkataloge nur die Einstiegsseite einer Website als Bezugsquelle für die DBE. Bei algorithmisch arbeitenden Suchmaschinen wird jede Webseite verwendet.
</p>
<div class="mw-heading mw-heading2"><h2 id="Architektur_eines_Retrievalsystems">Architektur eines Retrievalsystems</h2></div>
<p>Es gibt digitale und nicht-digitale Speichermedien, wie etwa Steilkarten, Bibliothekskataloge und Sichtloskarten. Digitale Speichermedien werden von der Informatik erarbeitet und sind Beschäftigungsbereich der Informationswissenschaft.
Man unterscheidet zwischen der Dateistruktur und ihrer Funktion. Darüber hinaus gibt es Schnittstellen des Retrievalsystems mit den Dokumenten und mit ihren Nutzern. Bei der Schnittstelle zwischen System und Dokument unterscheidet man wieder drei Bereiche. Das Finden von Dokumenten, das sogenannte Crawling, die Kontrolle dieser gefundenen Dokumente auf Updates und die Einordnung in ein Feldschema. Die Dokumente werden entweder intellektuell oder automatisch erfasst und weiter verarbeitet. Dabei werden die DE zweifach abgespeichert. Einmal als Dokumentendatei und zusätzlich noch als invertierte Datei, welche als Register oder Index den Zugriff auf die Dokumentendatei erleichtern soll.
Nutzer und System treten in folgender Weise in Kontakt. Der Nutzer verfasst
</p>
<ol><li>eine Anfrageformulierung, erhält</li>
<li>eine Trefferliste, lässt sich</li>
<li>die Dokumentationseinheiten anzeigen und verarbeitet sie</li>
<li>lokal weiter.</li></ol>
<div class="mw-heading mw-heading3"><h3 id="Zeichensätze"><span id="Zeichens.C3.A4tze"></span>Zeichensätze</h3></div>
<p>1963 entstand der <a href="ASCII" class="mw-redirect" title="ASCII">ASCII</a>-Code (American Standard Code for Information Interchange). Sein 7 bit-Code konnte 128 Zeichen erfassen und abbilden. Er wurde später auf 8 bit (= 256 Zeichen) erweitert. Der bislang größte Zeichensatz <a href="Unicode" title="Unicode">Unicode</a> umfasst 4 Byte, also 32 bit und soll alle Zeichen abbilden, die überhaupt auf der Welt genutzt werden.
Die <a href="ISO_8859" title="ISO 8859">ISO 8859</a> (International Organisation for Standardization) regelt darüber hinaus sprachspezifische Varianten, wie etwa das „ß“ in der deutschen Sprache.
</p>
<div class="mw-heading mw-heading3"><h3 id="Aufnahme_neuer_Dokumente_in_die_Datenbasis">Aufnahme neuer Dokumente in die Datenbasis</h3></div>
<p>Neue Dokumente können sowohl intellektuell, als auch automatisch der Datenbasis hinzugefügt werden. Bei der intellektuellen Aufnahme neuer Dokumente ist ein Indexer verantwortlich und entscheidet, welche Dokumente wie aufgenommen werden. Der automatische Prozess erfolgt durch einen „Robot“ oder einen „Crawler“. Grundlage ist eine bekannte Menge an Webdokumenten, eine sogenannte „seed list“. Die Links aller Webseiten, die diese Liste enthält, ist nun Aufgabe der Crawler. Die URL der jeweiligen Seiten wird geprüft, ob sie bereits in der Datenbasis vorhanden ist oder nicht. Darüber hinaus werden Spiegel und Dubletten erkannt und gelöscht.
</p>
<div class="mw-heading mw-heading3"><h3 id="Crawler">Crawler</h3></div>
<div class="mw-heading mw-heading4"><h4 id="Best-First_Crawler">Best-First Crawler</h4></div>
<p>Einer der Best-First-Crawler ist der Page Rank-Crawler. Er sortiert die Links nach Anzahl und Popularität der eingehenden Seiten. Zwei weitere sind der Fish-Search- und der Shark-Search-Crawler. Ersterer beschränkt seine Arbeit auf Bereiche im Web, in denen sich relevante Seiten konzentrieren. Der Shark-Search-Crawler verfeinert diese Methode, indem er zusätzliche Informationen zum Beispiel aus den Ankertexten zieht, um ein Relevanzurteil zu treffen.
Jeder Seitenbetreiber hat die Möglichkeit, seine Seite gegen Crawler zu verschließen.
</p>
<div class="mw-heading mw-heading4"><h4 id="Crawling_im_Deep_Web">Crawling im Deep Web</h4></div>
<p>Damit ein Crawler auch im Deep Web erfolgreich arbeiten kann, muss er verschiedene Anforderungen erfüllen. Zum einen muss er die Suchmaske der Datenbank „verstehen“, um eine adäquate Suchanfrage formulieren zu können. Darüber hinaus muss er Trefferlisten verstehen und Dokumente anzeigen können. Das funktioniert allerdings nur bei kostenlosen Datenbanken. Wichtig für Deep Web Crawler ist es, dass sie Suchargumente derart formulieren können, dass alle Dokumente der Datenbank angezeigt werden. Ist in der Suchmaske ein Jahrgangsfeld vorhanden, müsste der Crawler der Reihe nach alle Jahrgänge anfragen, um an alle Dokumente zu gelangen. Bei Stichwortfeldern ist eine adaptive Strategie am sinnvollsten.
Sind die Daten einmal erfasst, muss der Crawler nur noch die Updates der gefundenen Seiten erfassen. Um die DE möglichst aktuell zu halten, gibt es mehrere Möglichkeiten. Entweder die Seiten werden im selben Abstand regelmäßig besucht, was allerdings die Ressourcen weit übersteigen würde und daher unmöglich ist, oder der Besuch nach Zufall, was allerdings eher suboptimal funktioniert. Eine dritte Möglichkeit wäre der Besuch nach Prioritäten. Beispielsweise nach dem Takt ihrer Änderungen (seitenzentriert) oder der Häufigkeit ihrer Aufrufe oder Downloads (nutzerzentriert).
Weitere Aufgaben der Crawler sind es, Spam, Dubletten sowie Spiegel zu erkennen. Die Erkennung von Dubletten erfolgt in der Regel über den Vergleich der Pfade. Die Vermeidung von Spam gestaltet sich etwas schwieriger, da Spam oft versteckt auftritt.
</p>
<div class="mw-heading mw-heading4"><h4 id="FIFO_(first_in_first_out)-Crawler"><span id="FIFO_.28first_in_first_out.29-Crawler"></span>FIFO (first in first out)-Crawler</h4></div>
<p>Zu den <a href="FIFO" class="mw-redirect" title="FIFO">FIFO</a>-<a href="Crawler" title="Crawler">Crawlern</a> gehören der Breadth-First-Crawler, welcher allen Links einer Seite folgt, diese abarbeitet und den Links der gefundenen Seiten weiter folgt und der Depth-First-Crawler. Dieser arbeitet im ersten Schritt wie der Breadth-First-Crawler, trifft im zweiten Schritt allerdings eine Auswahl, welchen Links er weiter folgt und welchen nicht.
</p>
<div class="mw-heading mw-heading4"><h4 id="Thematische_Crawler">Thematische Crawler</h4></div>
<p>Thematische Crawler sind auf eine Disziplin spezialisiert und daher geeignet für Fachexperten. Thematisch nicht relevante Seiten werden identifiziert und „getunnelt“. Dennoch werden die Links dieser getunnelten Seiten weiter verfolgt, um weitere relevante Seiten zu finden.
<i>Distiller</i> finden derweil einen günstigen Ausgangspunkt für die Crawler, indem sie Taxonomien und Musterdokumente nutzen. <i>Classifier</i> eruieren diese Seiten auf Relevanz. Der ganze Vorgang läuft semiautomatisch, da Taxonomien und Musterdokumente regelmäßig aktualisiert werden müssen. Darüber hinaus wird eine Begriffsordnung benötigt.
</p>
<div class="mw-heading mw-heading3"><h3 id="Speichern_und_Indexieren">Speichern und Indexieren</h3></div>
<p>Die gefundenen Dokumente werden in die Datenbasis kopiert. Dafür werden zwei Dateien angelegt, zum einen die Dokumentendatei, zum anderen eine <a href="Invertierte_Datei" title="Invertierte Datei">invertierte Datei</a>. In der invertierten Datei werden alle Wörter oder Phrasen geordnet und nach Alphabet oder einem anderen Sortierkriterium aufgelistet. Ob man einen Wortindex oder einen Phrasenindex verwendet, hängt vom Feld ab. Bei einem Autorenfeld eignet sich beispielsweise der Phrasenindex wesentlich besser als der Wortindex. In der invertierten Datei finden sich Angaben über die Position der Wörter oder Phrasen im Dokument und Strukturinformationen. Strukturinformationen können für das Relevanceranking nützlich sein. Wenn etwa angegeben ist, dass ein Wort größer geschrieben wurde, kann man dieses auch höher gewichten. Die Wörter und Phrasen werden sowohl in der richtigen Reihenfolge geschrieben, als auch rückwärts abgelegt. Das ermöglicht eine offene Linkstrukturierung. Die Speicherung der invertierten Datei erfolgt in einem <a href="Datenbankindex" title="Datenbankindex">Datenbankindex</a>.
</p>
<div class="mw-heading mw-heading2"><h2 id="Klassifikation_von_Retrievalmodellen">Klassifikation von Retrievalmodellen</h2></div>
<p>Eine zweidimensionale Klassifikation von IR-Modellen zeigt die nachstehende Abbildung. Folgende Eigenschaften lassen sich bei den verschiedenen Modellen in Abhängigkeit von ihrer Einordnung in der Matrix beobachten:
</p>

<ul><li>Dimension: <i>mathematisches Fundament</i>
<ul><li><i>Algebraische Modelle</i> stellen Dokumente und Anfragen als Vektoren, Matrizen oder Tupel dar, die zur Berechnung von paarweisen Ähnlichkeiten über eine endliche Anzahl algebraischer Rechenoperationen in ein eindimensionales Ähnlichkeitsmaß überführt werden.</li>
<li><i>Mengentheoretische Modelle</i> zeichnen sich dadurch aus, dass sie natürlichsprachliche Dokumente auf Mengen abbilden und die Ähnlichkeitsbestimmung von Dokumenten (in erster Linie) auf die Anwendung von Mengenoperationen zurückführen.</li>
<li><i>Probabilistische Modelle</i> sehen den Prozess der Dokumentensuche bzw. der Bestimmung von Dokumentenähnlichkeiten als ein mehrstufiges <a href="Zufallsexperiment" title="Zufallsexperiment">Zufallsexperiment</a> an. Zur Abbildung von Dokumentenähnlichkeiten wird daher auf Wahrscheinlichkeiten und probabilistische Theoreme (insbesondere auf den <a href="Satz_von_Bayes" title="Satz von Bayes">Satz von Bayes</a>) zurückgegriffen.</li></ul></li></ul>
<ul><li>Dimension: <i>Eigenschaften des Modells</i>
<ul><li><i>Modelle mit immanenten Terminterdependenzen</i> zeichnen sich dadurch aus, dass sie vorhandene Interdependenzen zwischen Termen berücksichtigen und ihnen somit – im Unterschied zu den Modellen ohne Terminterdependenzen – nicht die implizite Annahme zu Grunde liegt, dass Terme orthogonal bzw. unabhängig voneinander sind. Die Modelle mit den immanenten Terminterdependenzen grenzen sich von den Modellen mit den transzendenten Terminterdependenzen dadurch ab, dass das Ausmaß einer Interdependenz zwischen zwei Termen aus dem Dokumentenbestand, in einer vom Modell bestimmten Weise, abgeleitet wird – also dem Modell innewohnend (immanent) ist. Die Interdependenz zwischen zwei Termen wird bei dieser Klasse von Modellen direkt oder indirekt aus der <a href="Kookkurrenz" title="Kookkurrenz">Kookkurrenz</a> der beiden Terme abgeleitet. Unter Kookkurrenz versteht man dabei das gemeinsame Auftreten zweier Terme in einem Dokument. Dieser Modellklasse liegt somit die Annahme zu Grunde, dass zwei Terme zueinander interdependent sind, wenn sie häufig gemeinsam in Dokumenten vorkommen.</li>
<li><i>Modelle ohne Terminterdependenzen</i> zeichnen sich dadurch aus, dass jeweils zwei verschiedene Terme als vollkommen unterschiedlich und keinesfalls miteinander verbunden angesehen werden. Dieser Sachverhalt wird in der Literatur häufig auch als Orthogonalität von Termen bzw. als Unabhängigkeit von Termen bezeichnet.</li>
<li>Wie bei den Modellen mit immanenten Terminterdependenzen, liegt auch den <i>Modellen mit transzendenten Terminterdependenzen</i> keine Annahme über die Orthogonalität oder Unabhängigkeit von Termen zu Grunde. Im Unterschied zu den Modellen mit immanenten Terminterdependenzen können die Interdependenzen zwischen den Termen bei den Modellen mit transzendenten Terminterdependenzen nicht ausschließlich aus dem Dokumentenbestand und dem Modell abgeleitet werden. Das heißt, dass die den Terminterdependenzen zu Grunde liegende Logik als über das Modell hinausgehend (transzendent) modelliert wird. Das bedeutet, dass in den Modellen mit transzendenten Terminterdependenzen das Vorhandensein von Terminterdependenzen explizit modelliert wird, aber dass die konkrete Ausprägung einer Terminterdependenz zwischen zwei Termen direkt oder indirekt von außerhalb (z.&nbsp;B. von einem Menschen) vorgegeben werden muss.</li></ul></li></ul>
<p>Information-Retrieval hat Querbezüge zu verschiedenen anderen Gebieten, z.&nbsp;B. <a href="Wahrscheinlichkeitstheorie" title="Wahrscheinlichkeitstheorie">Wahrscheinlichkeitstheorie</a> der <a href="Computerlinguistik" title="Computerlinguistik">Computerlinguistik</a>.
</p>
<div class="mw-heading mw-heading2"><h2 id="Literatur">Literatur</h2></div>
<ul><li><a href="Gerard_Salton" title="Gerard Salton">Gerard Salton</a>; Michael J. McGill, Introduction to modern information retrieval. mcgraw-hill, 1983.</li>
<li>James D. Anderson, J. Perez-Carballo: <style data-mw-deduplicate="TemplateStyles:r261891140">
/* start https://de.wikipedia.org/ */


.mw-parser-output .webarchiv-memento a{color:inherit}


/* end https://de.wikipedia.org/ */
</style><a rel="nofollow" class="external text" href="https://web.archive.org/web/20081231182042/http://www.scils.rutgers.edu/~carballo/ird2005.html"><i>Information retrieval design: principles and options for information description, organization, display, and access in information retrieval databases, digital libraries, and indexes</i></a> (<span class="webarchiv-memento"><a href="Webarchivierung#Begrifflichkeiten" title="Webarchivierung">Memento</a></span> vom 31. Dezember 2008 im <i><a href="Internet_Archive" title="Internet Archive">Internet Archive</a></i>) University Publishing Solutions, 2005.</li>
<li>Michael C. Anderson: <i>Retrieval.</i> In: <a href="Alan_Baddeley" title="Alan Baddeley">A. D. Baddeley</a>, <a href="Michael_W._Eysenck" title="Michael W. Eysenck">M. W. Eysenck</a>, M. C. Anderson. <i>Memory.</i> Psychology Press, Hove, New York 2009, ISBN 978-1-84872-001-5, S. 163–189.</li>
<li>R. Baeza-Yates, B. Ribeiro-Neto: <i>Modern Information Retrieval.</i> ACM Press, Addison-Wesley, New York 1999.</li>
<li>Reginald Ferber: <i><a rel="nofollow" class="external text" href="http://information-retrieval.de/">Information Retrieval</a></i>. dpunkt.verlag, 2003, ISBN 3-89864-213-5.</li>
<li>Dominik Kuropka: <i><a rel="nofollow" class="external text" href="http://www.logos-verlag.de/cgi-bin/engbuchmid?isbn=0514&amp;lng=deu&amp;id=">Modelle zur Repräsentation natürlichsprachlicher Dokumente. Ontologie-basiertes Information-Filtering und -Retrieval mit relationalen Datenbanken</a>.</i> ISBN 3-8325-0514-8.</li>
<li>Christopher D. Manning, Prabhakar Raghavan, und Hinrich Schütze: <a rel="nofollow" class="external text" href="http://nlp.stanford.edu/IR-book/">Introduction to Information Retrieval</a>. Cambridge: Cambridge university press, 2008, ISBN 978-0-521-86571-5.</li>
<li>Dirk Lewandowski: <i>Suchmaschinen verstehen.</i> Springer, Heidelberg 2015, ISBN 978-3-662-44013-1.</li>
<li>Dirk Lewandowski: <i><a rel="nofollow" class="external text" href="http://www.durchdenken.de/lewandowski/doc/web-ir.php">Web Information Retrieval</a>.</i> In: <i>Information: Wissenschaft und Praxis (nfd).</i> 56 (2005) 1, S. 5–12, <span class="-print"><a href="Internationale_Standardnummer_f%C3%BCr_fortlaufende_Sammelwerke" title="Internationale Standardnummer für fortlaufende Sammelwerke">ISSN</a>&nbsp;<span style="white-space:nowrap"><a rel="nofollow" class="external text" href="https://zdb-katalog.de/list.xhtml?t=iss%3D%221434-4653%22&amp;key=cql">1434-4653</a></span></span></li>
<li>Dirk Lewandowski: <i><a rel="nofollow" class="external text" href="http://www.durchdenken.de/lewandowski/web-ir/">Web Information Retrieval, Technologien zur Informationssuche im Internet</a>.</i> (= Informationswissenschaft. 7). DGI Schrift. Frankfurt am Main 2005, ISBN 3-925474-55-2.</li>
<li>Eleonore Poetzsch: <a rel="nofollow" class="external text" href="http://web.archive.org/web/20160304025653/http://www.e-poetzsch.de/Buch_Retrieval.htm"><i>Information Retrieval - Einführung in Grundlagen und Methoden.</i></a> E.&nbsp;Poetzsch Verlag, Berlin 2006, ISBN 3-938945-01-X.</li>
<li><a href="Gerard_Salton" title="Gerard Salton">Gerard Salton</a>, Michael J. McGill: <i>Introduction to modern information retrieval.</i> McGraw-Hill, New York 1983.</li>
<li><a href="Wolfgang_G._Stock" title="Wolfgang G. Stock">Wolfgang G. Stock</a>: <i>Information Retrieval. Informationen suchen und finden.</i> Oldenbourg, München/Wien 2007, ISBN 978-3-486-58172-0.</li>
<li>Alexander Martens: <i>Visualisierung im Information Retrieval - Theorie und Praxis angewandt in Wikis als Alternative zu Semantic Web.</i> BoD, Norderstedt, ISBN 978-3-8391-2064-4.</li>
<li>Matthias Nagelschmidt, Klaus Lepsky, Winfried Gödert: <i>Informationserschließung und Automatisches Indexieren: Ein Lehr- und Arbeitsbuch.</i> Springer, Berlin, Heidelberg 2012, ISBN 978-3-642-23512-2.</li></ul>
<div class="mw-heading mw-heading2"><h2 id="Weblinks">Weblinks</h2></div>
<ul><li><a rel="nofollow" class="external text" href="http://www.uni-hildesheim.de/fgir/">Fachgruppe Information Retrieval</a> der <a href="Gesellschaft_f%C3%BCr_Informatik" title="Gesellschaft für Informatik">Gesellschaft für Informatik</a></li>
<li>Norbert Fuhr: Vorlesung „Information Retrieval“ an der Universität Duisburg-Essen, 2006, <a rel="nofollow" class="external text" href="http://www.is.inf.uni-due.de/teaching/lectures/ir_ss06/index.html">Materialien</a></li>
<li>Karin Haenelt: <a rel="nofollow" class="external text" href="http://kontext.fraunhofer.de/haenelt/kurs/InfoRet/index.html">Seminar „Information Retrieval“</a> Universität Heidelberg, 2015</li>
<li>Heinz-Dirk Luckhardt: <i>Information Retrieval</i>, Universität Saarland, <a rel="nofollow" class="external text" href="https://web.archive.org/web/20011130150356/http://is.uni-sb.de/studium/handbuch/exkurs.ir.php">im Virtuellen Handbuch Informationswirtschaft</a> (<span class="webarchiv-memento"><a href="Webarchivierung#Begrifflichkeiten" title="Webarchivierung">Memento</a></span> vom 30. November 2001 im <i><a href="Internet_Archive" title="Internet Archive">Internet Archive</a></i>)</li>
<li>UPGRADE, The European Journal for the Informatics Professional, <a rel="nofollow" class="external text" href="http://www.upgrade-cepis.org/index.jsp?p=2139&amp;n=2149">Information Retrieval and the Web</a> Band III, Nr. 3, Juni 2002.</li>
<li>C. J. van Rijsbergen: <a rel="nofollow" class="external text" href="http://www.dcs.gla.ac.uk/Keith/Preface.html">Information Retrieval, 1979</a></li>
<li><a rel="nofollow" class="external text" href="http://www.ir-facility.org/">Information Retrieval Facility (IRF)</a></li></ul>
<div class="mw-heading mw-heading2"><h2 id="Einzelnachweise">Einzelnachweise</h2></div>
<ol class="references">
<li id="cite_note-:0-1"><span class="mw-cite-backlink">↑ <sup><a href="#cite_ref-:0_1-0">a</a></sup> <sup><a href="#cite_ref-:0_1-1">b</a></sup></span> <span class="reference-text"><a rel="nofollow" class="external text" href="https://www.uni-bamberg.de/fileadmin/uni/fakultaeten/wiai_lehrstuehle/medieninformatik/Dateien/Publikationen/2008/henrich-ir1-1.2.pdf">Information Retrieval 1, Grundlagen, Modelle und Anwendungen</a>, Andreas Henrich, Version: 1.2 (Rev: 5727, Stand: 7. Januar 2008), Otto-Friedrich-Universität Bamberg, Lehrstuhl für Medieninformatik, 2001 – 2008, S.&nbsp;263–264</span>
</li>
<li id="cite_note-2"><span class="mw-cite-backlink"><a href="#cite_ref-2">↑</a></span> <span class="reference-text">Salton Gerard, Macgill Michael J.: <cite style="font-style:italic">Introduction to Modern Information Retrieval.</cite> Mcgraw-Hill, New York 1983, ISBN 0-07-054484-0.<span class="Z3988" title="ctx_ver=Z39.88-2004&amp;rft_val_fmt=info%3Aofi%2Ffmt%3Akev%3Amtx%3Abook&amp;rfr_id=info:sid/de.wikipedia.org:Information+Retrieval&amp;rft.au=Salton+Gerard%2C+Macgill+Michael+J.&amp;rft.btitle=Introduction+to+Modern+Information+Retrieval.&amp;rft.date=1983&amp;rft.genre=book&amp;rft.isbn=0070544840&amp;rft.place=New+York&amp;rft.pub=Mcgraw-Hill" style="display:none">&nbsp;</span></span>
</li>
</ol>
<div class="hintergrundfarbe1 rahmenfarbe1 navigation-not-searchable normdaten-typ-s" style="border-style: solid; border-width: 1px; clear: left; margin-bottom:1em; margin-top:1em; padding: 0.25em; overflow: hidden; word-break: break-word; word-wrap: break-word;" id="normdaten">
<div style="display: table-cell; vertical-align: middle; width: 100%;">
<div>
Normdaten&nbsp;(Sachbegriff): <a href="Gemeinsame_Normdatei" title="Gemeinsame Normdatei">GND</a>: <span class="-print"><a rel="nofollow" class="external text" href="https://d-nb.info/gnd/4072803-1">4072803-1</a></span> </div>
</div></div></div><!--htdig_noindex--><div><div class="zim-footer">
Dieser Artikel wurde von <a class="external text" title="Zuletzt bearbeitet am 2025-12-15" href="https://de.wikipedia.org/wiki/?title=Information_Retrieval&amp;oldid=262438392">Wikipedia</a> herausgegeben. Der Text ist unter <a class="external text" href="https://creativecommons.org/licenses/by-sa/4.0/deed.de">Creative Commons Attribution-Share Alike 4.0</a> verfügbar, sofern nicht anders angegeben. Für die Mediendateien können zusätzliche Bedingungen gelten.
</div>
</div><!--/htdig_noindex--></div>
</div>
</main>
</div>
</div>
</div>
<script src="./_webp_/webpHandler.js"></script>

</body></html>